Evolución del PLN: De la IA Fragmentada a los Modelos Fundacionales
Definiciones
- IA Fragmentada: Una era definida por arquitecturas neuronales discretas y especializadas, diseñadas para tareas individuales como el etiquetado de secuencias o la clasificación.
- Modelo Fundacional: Una arquitectura de transformador monolítica y unificada que trata todos los problemas lingüísticos como una secuencia generativa de texto a texto $x \rightarrow y$.
Conceptos Clave
- Consolidación Arquitectónica: Históricamente, el PLN requería canales de procesamiento hechos a medida (Bi-LSTM para NER, CNN para sentimiento). Los LLM colapsan estos silos en una única columna vertebral donde los mismos pesos se utilizan para cada tarea.
- La Interfaz Unificada: Los LLM reemplazan las "cabezas de salida" especializadas (p. ej., Softmax de 3 clases) con una interfaz de lenguaje natural. Las entradas y salidas son siempre cadenas de texto, lo que permite al modelo interpretar la intención en lugar de el formato.
- Transferencia de Conocimiento: Los modelos tradicionales eran "tabula rasa" para cada tarea. Los LLM priorizan la Generalización Primero, donde las tareas específicas son meras aplicaciones de una representación interna robusta y preexistente del lenguaje.
Contexto Histórico
- Antes de 2018: El aislamiento de tareas requería entrenar modelos distintos con diferentes funciones de pérdida $\mathcal{L}_{task}$.
- Era Moderna: El paradigma "Texto a Texto" permite que un único modelo (p. ej., Llama-3) cambie de tarea mediante indicaciones zero-shot o few-shot.
Comparación de Implementación en Python
